🎬 **影片/照片位置:
觀看重點:找出系統從感測環境、判斷狀態、輸出動作到再次取得回饋的完整閉環。
生成式 AI 可以產生文字、影像與程式碼。Physical AI 則需要把物理世界的狀態轉成可計算資料,根據任務做出決定,再讓機器人回到物理世界採取行動。
兩者最大的差異不是模型名稱,而是錯誤的後果。文字回答錯誤,可以重新查證;機器人的動作錯誤,可能造成碰撞、物件掉落、設備停機,甚至人員風險。
** 什麼條件成立時,一套 AI 系統才算進入 Physical AI 的範圍?**
可以用四個步驟理解:

這個閉環中,任何一層都可能失敗:
因此,Physical AI 的完成條件不能只寫「模型推論成功」。至少要確認輸入是否可信、動作是否被執行、結果是否符合預期,以及失敗是否能被偵測。

居家移動操作示範把語音、庫存相機、導航與手臂抓取串在一起。使用者提出需求後,系統先查詢庫存,再移動到指定位置,以 AprilTag 或既定地點輔助定位,最後執行抓取。
這個流程不是一個語言模型單獨完成。Navigation2、相機、底盤、手臂控制模型與實際物件位置都必須對齊。ACT 模型在固定地點抓取特定零食較穩定,但物件包裝或位置改變後可能失效,這就是任務分布改變的限制。

Autoware 的示例更能看出模組分工:LiDAR、IMU、GNSS 與車速訊號先建立車輛狀態;定位結果進入路徑規劃;控制系統計算目標速度與轉向;vehicle interface 再把抽象命令轉成油門、煞車、扭矩或伺服馬達命令。
同一套軟體架構可以移植到不同尺寸車輛,但感測器配置、控制介面、車輛動態與安全邊界仍需重新確認。共用架構不等於所有參數可以照搬。
年會第五場以資料金字塔說明,Physical AI 的資料不只是一段文字。可以依層級整理如下:
| 資料層級 | 例子 | 主要問題 |
|---|---|---|
| 原始感測資料 | 影像、點雲、力量、觸覺、壓力、關節位置 | 時間是否同步?單位與座標是否一致? |
| 狀態與語意資料 | 物件、姿態、工作區、可見/遮擋 | 標註規則是否一致?可信度如何表示? |
| 人類示範資料 | 遙操作軌跡、抓取步驟、成功/失敗示範 | 示範是否涵蓋例外?是否帶入個人偏差? |
| 任務流程資料 | 前置條件、步驟、品質閘門、返工 | 流程是否可執行?失敗如何回復? |
| 回饋與技能資料 | 任務結果、人員接管、修正動作 | 能否追溯原始狀態與修正原因? |
資料越往上層,數量可能越少,但與任務及人員決策的關係越密切。這些資料如果缺少時間戳記、座標、版本與結果標籤,就很難重播,也很難拿來改善模型。
Physical AI 的動作會影響真實世界,不適合把所有錯誤都留到實機才發現。數位場景與物理模擬可以先檢查:
模擬不能取代實體驗證,但可以把一部分明確的幾何、控制與流程錯誤提早暴露,並留下可重播紀錄。
針對一個機器人任務,先回答:
| 閉環位置 | 最低檢查內容 |
|---|---|
| 感知 | 有哪些感測器?資料頻率、延遲、單位與可信度如何? |
| 狀態 | 系統如何表示物件、機器人、環境與不確定性? |
| 決策 | 目標、限制、正常路徑與失敗分支是什麼? |
| 行動 | 命令如何轉成硬體動作?有哪些速度、力與空間限制? |
| 回饋 | 如何確認任務成功?誰能停止或接管? |
| 紀錄 | 是否保留輸入、原始動作、修正動作與結果? |
如果其中一欄只能回答「由 AI 自動判斷」,就表示系統仍缺少可驗證的責任分界。
本文提供的是 Physical AI 的工程心智模型,不代表任何特定模型已達成自主操作能力。年會示範與公開專案可以證明整合路徑可被實作,不能直接外推成商用可靠度、產線良率或醫療效益。
Day 3 會處理閉環中最重要的一道閘門:即使模型已經輸出動作,為什麼仍要在送往硬體前再檢查一次?